P2: 为慈善机构寻找捐助者

探索数据

Criteria Meet Specification

数据探索

学员正确地计算了下列数值:

  • 记录的数目
  • 收入大于50000美金的人数
  • 收入小于等于50000美金的人数
  • 收入大于50000美金的人数所占百分比

准备数据

Criteria Meet Specification

数据预处理

学员正确地对特征和目标实现了独热编码。

评估模型表现

Criteria Meet Specification

问题一:
简单预测表现

学员正确地计算了简单预测的准确率和F1分数。

问题2:
模型应用

学员解释了选择这几个模型的原因,并说明了每一个模型的优缺点。

创建一个训练和预测的流程

学员成功地实现了一个监督学习算法的流程。

初始模型表现

学员正确地实现了三个监督学习模型,得出了模型表现可视化的图表。

优化结果

Criteria Meet Specification

问题三:
选择最好的模型

在考虑了计算成本、模型表现和数据特点之后,学员选出了最好的模型并给出了充足的理由。

问题四:
用普通人能听懂的话来描述模型

学员能够用清晰简洁的话来向一个没有机器学习或任何其他技术背景的人来解释最优模型的工作原理。

模型调优

最终模型利用了网格搜索进行参数调优,至少挑战了一个参数,并且至少有三个可选值。如果模型参数不需要任何调整,学生需要给出明确的理由。

问题五:
最终模型评估

学员在表格中正确汇报了调优过后、调优之前以及基准模型的准确率和 F1 分数。学员把最终模型的结果与之前得到的结果进行了对比。

特征重要性

Criteria Meet Specification

问题六:
观察特征相关性

学员列出了他们认为对预测个人收入最重要的 5 个特征,同时给出了选择这些特征的理由。

问题七:
提取特征重要性

学员调用了一个监督学习模型的 feature_importances_ 属性。此外,学员列出了这些重要的特征并讨论了这些特征的相同点和不同点。

问题八:
特征选择效果

学员用最重要的 5 个特征建模并分析了和对比了改模型与 问题五 中的最优模型的表现。

Tips to make your project standout:

你可以 在这里查看此评审标准的英文版本